John Schulman
概述
强化学习研究者,PPO(近端策略优化)算法的主要发明者,后成为 OpenAI 对齐团队核心成员。
关键内容
- PPO 论文(2017):发表《Proximal Policy Optimization Algorithms》,提出 PPO 算法,通过裁剪策略更新实现稳定高效的强化学习训练。
- PPO 影响:PPO 因其实现简单、调参友好、性能稳定,成为深度强化学习的主流算法,后被用于 InstructGPT 中的 RLHF 对齐。
- OpenAI 工作:在 OpenAI 期间参与 ChatGPT 的 RLHF 对齐工作,将 PPO 应用于大语言模型的人类偏好学习。
来源
- ai_papers_timeline.md — 2017 年时间线条目
相关
- PPO(近端策略优化) — contributed_to
- OpenAI — affiliated_with
- InstructGPT — influenced